Meta推出首個實時音頻感知模型Muse Voice Transcribe,可通過Model API調用,定價每1000分鐘3美元(約每小時0.18美元)。該模型整合流式語音識別、說話人分離與端點檢測,支持邊說邊轉寫,無需等待整段音頻,並可自動區分20餘名說話者分軌輸出。
Moonshot
$200
輸入tokens/百萬
輸出tokens/百萬
131
上下文長度
NijiVoice-MCP是一個開發中的項目,實現了與にじボイス(Niji Voice)API的Model Context Protocol (MCP)集成,使LLM能夠通過MCP接口輕鬆調用にじボイ斯的語音合成功能,包括語音生成、聲優列表獲取和餘額查詢等。